메뉴

#GPU 최적화

MP
MarkTechPost 44일 전
IMP 7

GPU 기반 최고속 K-평균: 플래시-K평균(Flash-KMeans) 공개

오픈소스 GPU 라이브러리인 플래시-K평균(Flash-KMeans)은 수학적 근사 없이 정확한 K-평균(K-means) 알고리즘을 수행하면서도 기존 라이브러리 대비 최대 200배 이상 높은 처리 속도를 자랑합니다. 이는 트라이톤(Triton) GPU 커널을 활용해 입출력(IO) 병목 현상과 연산 충돌을 최소화하여 데이터 센터 및 실무 환경의 클러스터링 연산 비용을 획기적으로 낮춰줍니다.

K-평균(k-means) GPU 최적화 오픈소스
HN
Hacker News 57일 전
IMP 8

스탠퍼드 CS336: 밑바닥부터 시작하는 언어 모델링

스탠퍼드 대학교에서 2026년 봄 학기에 개설되는 'CS336: 밑바닥부터 시작하는 언어 모델링' 강의 소개글입니다. 이 수업은 기존의 뼈대 코드를 활용하는 것과 달리, 학생들이 직접 데이터 수집부터 Transformer 모델 구현, GPU 분산 학습 및 최적화까지 대규모 언어 모델(LLM) 전체를 구축하는 실무적인 과정을 강조합니다. AI 연구원 및 엔지니어에게 필수적인 심화 구현 능력과 시스템 최적화 기술을 배우는 데 매우 중요한 코스입니다.

스탠퍼드 대학교 대규모 언어 모델 트랜스포머 모델
HN
Hacker News 68일 전
IMP 8

CODA: 트랜스포머 블록을 GEMM 에필로그 프로그램으로 재작성

AI 모델 학습 시 흔히 발생하는 메모리 병목 현상을 해결하기 위해, 개별적으로 처리되던 연산들을 하나의 GPU 커널(GEMM Epilogue)로 통합하여 성능을 극대화하는 새로운 추상화 기법인 CODA를 제안합니다. 이 방식은 데이터 이동을 최소화하면서도 프레임워크 수준의 생산성과 하드웨어 수준의 극적인 효율성을 동시에 달성할 수 있도록 돕습니다.

머신러닝 GPU 최적화 커널 개발
HN
Hacker News 83일 전
IMP 8

Unsloth와 엔비디아, 소비자용 GPU에서 LLM 학습 25% 속도 향상 달성

Unsloth와 NVIDIA는 소비자용 GPU에서 LLM 파인튜닝 시 발생하는 숨겨진 병목 현상을 해결하여 학습 속도를 약 25% 향상시켰습니다. 반복적인 메타데이터 구축을 캐싱하고, 그래디언트 체크포인팅 시 버퍼를 2개 사용해 연산을 겹치게 하며, MoE 라우팅을 최적화하는 세 가지 핵심 기술을 도입했습니다. 이는 개발자들이 기존 하드웨어의 한계를 뛰어넘어 최대치의 성능을 끌어낼 수 있게 해준다는 점에서 실무적으로 매우 중요합니다.

LLM 파인튜닝 GPU 최적화 Unsloth